Aggregate benchmark scores obscure patient safety implications of errors across frontier language models
Este estudo demonstra que as pontuações agregadas de benchmarks ocultam diferenças clinicamente significativas na segurança de modelos de linguagem de ponta, revelando que a precisão geral não consegue prever riscos críticos como subtriagem, viés contextual ou falhas na identificação de crises de suicídio.